近年來,大型語言模型(Large Language Model, LLM)的能力快速提升,已能處理複雜的自然語言任務並生成流暢的回應。然而,此類模型的知識內容受限於訓練資料的時間範圍,無法反映訓練截止後的資訊,且在缺乏足夠依據的情況下,仍可能產生語意通順卻與事實不符的回應,即所謂的幻覺(Hallucination)問題。
檢索增強生成(Retrieval-Augmented Generation, RAG)作為因應上述限制而提出的方法,其核心概念在於不直接修改模型參數,而是於生成回應前,先從外部知識來源中檢索與問題相關的內容,並將其作為生成依據,藉此提升回應的準確性與時效性。
然而,RAG 系統的建置雖已具備成熟的工具與框架支援,其效能評估卻仍是實務上普遍缺乏系統性方法的環節。由於 RAG 的處理流程涉及檢索與生成兩個階段,任一階段的缺陷皆可能導致最終輸出品質下降,且兩者的誤差往往相互掩蓋,使問題根源難以判斷。缺乏明確的評測指標,將使系統調整(如更換 Embedding 模型、調整切分策略、改變檢索方式)缺乏客觀依據,難以驗證其成效。
有鑑於此,本系列文章希望能建立一套完整的脈絡,說明 RAG 的運作原理與評測方法。